經過前兩天的洗禮,你手上應該握著一份名單,記滿了誰來過、來過幾次。今天我們要面對更核心、也更讓人不安的問題:這些造訪背後,到底藏著什麼樣的企圖?
一句「AI 來過了」,其實掩蓋了三種完全不同層次的關係:
第一種你大概恨不得鎖死大門,第二種你多半願意半推半就,而第三種才是你真正渴求的對象。但在冷冰冰的 access log 裡,前兩者長得像雙胞胎,第三種根本就不在同一個世界裡。今天我們就把這層關係扒開來看。
先把話說清楚。免得你以為這是分析工具商人為了賣東西編織出來的焦慮感,這三種關係的界線,全是那幾家 AI 大廠在自己的聲明裡親手畫下的。
最直接的證據就寫在他們的名字上。回頭看昨天那張表:
| 公司 | 訓練型 | 索引型 | 即時型 |
|---|---|---|---|
| OpenAI | GPTBot |
OAI-SearchBot |
ChatGPT-User |
| Anthropic | ClaudeBot |
Claude-SearchBot |
Claude-User |
| Mistral | MistralAI-Training |
MistralAI-Index |
MistralAI-User |
| Meta | meta-externalagent |
meta-webindexer |
meta-externalfetcher |
四家公司,極度默契地把同一件事切成同樣的三塊。天下沒有這麼巧的事,這是因為在他們公司的深處,這根本是三套完全獨立的系統、三種懸殊的成本結構,以及三套截然不同的法律卸責說詞。
Google 做得更絕,直接把這套階級寫進了文件架構裡。他們的爬蟲總覽頁把所有抓取行為分成三類:
而 Cloudflare 在 2026 年 7 月的變更公告裡,更狠地把這種分類直接做成了可以撥動的產品開關,他們用的字眼是 Search、Agent、Training。官方定義是這樣寫的:
當一家掐著全球大半 HTTP 流量脖子的公司把某個分類做成了開關,這就不再只是學術討論了。(這份公告裡還藏著一條對 2026-09-15 之後新網域預設值的變更,那是我們第 10 天的重頭戲,今天先扣著不表。)
是誰: GPTBot、ClaudeBot、meta-externalagent、CCBot、Bytespider 這些傢伙。
真實意圖: 大口吞嚥你的內容,咀嚼後變成他們模型的血肉。OpenAI 對 GPTBot 的辯解是「It is used to crawl content that may be used in training our generative AI foundation models」;Anthropic 談到 ClaudeBot 時說得委婉「collecting web content that could potentially contribute to their training」。
行為特徵: 冷酷、地毯式搜索、而且像陣雨一樣難以捉摸。他們的貪婪是沒有邊界的,目標是把你整座花園連根拔起。你會看著他們順著 sitemap 或是連結的藤蔓,一次把幾百頁掃空,然後陷入長久的死寂。他們根本不在乎什麼時效性,今天剝奪跟下週剝奪,對那龐大的訓練資料集來說毫無分別。
量體有多龐大? 這是唯一有大型第三方願意去測量的部分。Cloudflare 在 2025 年 8 月那份分析報告裡(量測窗口是 2025 年 7 月往回推 12 個月)寫得直白得刺眼:
"Over the past 12 months, 80% of AI crawling was for training, compared with 18% for search and just 2% for user actions."
那篇文章甚至給了讓人窒息的趨勢,2024 年 7 月訓練佔了 72%,到 2025 年 7 月已經膨脹到 79%。
這裡我必須插播一段極度誠實的警告。 Cloudflare 在 2026 年 7 月另一份報告裡突然改口說「52% of crawler requests are now for AI training as of June 2026, up from 22% in Spring 2025」。你大腦的本能絕對是想把 80% 和 52% 連成一條逐漸緩和的下坡線。千萬不要這麼做。這兩個數字的分母根本不一樣,一個是「AI 爬蟲的抓取量」,另一個是「所有爬蟲的請求」。更何況 2026 年的分類裡多了一個叫「mixed-use」的曖昧桶子。Cloudflare 自己那句「up from 22% in Spring 2025」就跟他們自己 2025 年 8 月講的 80% 互相掌嘴。這兩個都是官方公布的數字,但它們就像兩段完全不相干的感情史,拿來畫趨勢圖只會欺騙你自己。
你該怎麼面對: 這是唯一一種對你來說只有剝削、沒有絲毫回報的關係。它白白燒掉你的頻寬,短期內絕不會回饋你任何好處。要不要把門摔在他們臉上,這是一個價值觀的選擇,不再是技術問題。但在你落鎖之前,請先看看下一個對象。
這種關係裡頭還分成了兩種微妙的層次,意義完全不同,我們必須拆開來看。
-SearchBot真實意圖: 他們把你的特徵寫進自己產品的檢索庫裡,為了確保 AI 在回答問題時,能把你這個選項翻出來。
OpenAI 說 OAI-SearchBot 是「is used to surface websites in search results in ChatGPT's search features」,他們還補了一句所有站長都該刺在手臂上的話:「Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers.」
Perplexity 對於 PerplexityBot 的說法是「designed to surface and link websites in search results on Perplexity」,同時急於撇清自己沒有佔你便宜:「not used to crawl content for AI foundation models」。
你該怎麼面對: 這種傢伙本質上就是 AI 時代的 Googlebot。把它擋在門外,等於親手把自己在 AI 腦海裡的記憶給抹除了。這是一票人一氣之下把 AI 爬蟲全擋掉時,完全沒意識到的自毀行為。就像昨天引述的 OpenAI 原話,肉體訓練與名字檢索的界線是可以切開的,你可以只拒絕前者。
-User真實意圖: 就在此時此刻,某個真實存在的人在對話框裡拋出了一個問題,AI 覺得必須參考你的想法,於是現在跑來敲你的門。
Anthropic 把這件事形容得最有人味:「When individuals ask questions to Claude, it may access websites using a Claude-User agent.」
行為特徵: 偶發、零星、毫無規律可言。它對把你整個站扒光沒有興趣,它只專注於看那幾頁。這種流量通常微弱得可憐,在 Cloudflare 那份 12 個月的觀察裡,user actions 只佔了微不足道的 2%。
但這種親密接觸的價值極高。 當日誌裡浮現一筆 ChatGPT-User,那代表著有一個血肉之軀,在這個瞬間渴望得到一個答案,而某個龐大的系統認為,你的文字正是那把鑰匙。那距離一個真實的人類走進你家,就只差這最後一步了。
昨天我提過的那組實測數字,放在這裡正好能撕開這種規模差距的現實。我在 2026-09-06 扒下了各家官方的 IP 名冊:
| 清單 | IP 數量 | 上次更新時間 |
|---|---|---|
[openai.com/gptbot.json](https://openai.com/gptbot.json) (訓練) |
21 | 2025-10-30 |
[openai.com/searchbot.json](https://openai.com/searchbot.json) (索引) |
35 | 2026-01-02 |
[openai.com/chatgpt-user.json](https://openai.com/chatgpt-user.json) (即時) |
207 | 2026-09-04 |
Google common-crawlers.json |
317 | 2026-09-04 |
Google user-triggered-fetchers.json |
1,058 | 2026-09-03 |
跑腿專用的 IP 池,比訓練用的龐大了一個數量級,而且換血的速度快得驚人。這是我親手數出來的,不是廠商的官方宣傳。至於為什麼會這樣,最合理的推測是:這種隨時待命的抓取是養在巨大的雲端叢集裡,跟著需求暴漲暴跌;而那些苦力般的訓練爬蟲,則被關在特定的固定機房裡悶頭苦幹。這只是我觀察後的推論,廠商沒有承認過。
但這種輪廓本身就充滿了隱喻。「為了回答眼前這個人的渴望」是一種極度隨機、充滿彈性的行為;而「把整個世界的知識據為己有」則是一種死板的貪婪。基礎設施的長相,毫無保留地出賣了他們行為的本質。
這是今天最殘酷、也最容易讓人心碎的一節。
多數人天真地以為,只要在 robots.txt 寫下了規矩,對方就會乖乖遵守。但這些大廠在自己的規章裡,早就寫好了橫跨整個業界的免責聲明:「因為是使用者要求的,所以我可以不守規矩」。
| 對象 | 官方狡辯的原文 |
|---|---|
OpenAI (ChatGPT-User) |
"Because these actions are initiated by a user, robots.txt rules may not apply." |
Perplexity (Perplexity-User) |
"Since a user requested the fetch, this fetcher generally ignores robots.txt rules" |
Meta (meta-externalfetcher) |
"this crawler may bypass robots.txt rules" / "because it performs fetches that were requested by the user" |
| Google (整個 user-triggered 類別) | "Because the fetch was requested by a user, these fetchers generally ignore robots.txt rules." |
Google (Google-Safety) |
"Ignores robots.txt entirely" (這支是惡意內容偵測,根本不甩你) |
作為對照,當 Google 談到那些自動抓取的行為時,說法卻是道貌岸然的「They always respect robots.txt rules for automatic crawls.」
所以你必須認清這個現實:
這張門口的字條,只能擋住那些「機器自己起心動念」的擅闖者,卻攔不住那些「奉了活人的命令而來」的跑腿。
他們的藉口其實很完美:當一個活生生的人在瀏覽器裡打開你的網頁,你寫的 robots.txt 本來就擋不住他。而這類 -User 的抓取,在廠商眼裡不過是那個人意志的延伸。你可以覺得這全是狡辯,但你必須知道這套潛規則的存在。不然你會對著寫得嚴絲合縫的 robots.txt,看著絲毫沒減少的流量,陷入深深的自我懷疑。
這裡有個讓人發毛的沉默。Anthropic 的文件裡,完全找不到這條免責金牌。我把那頁來回翻了好幾遍,Claude-User 旁邊沒有任何一句「robots.txt 可能不適用」。這或許代表他們比較懂分寸,也可能只是懶得寫。沒有把特權寫出來,不代表承諾會乖乖守規矩,這點在感情跟技術裡都是通用的。
至於他們私底下到底有沒有踐踏這條底線,那是另一回事,必須靠實測來揭曉,這也是我們第 5 天的主題。今天我們只聽他們是怎麼說的。
前面兩種都是機器的偽裝,而這第三種,是貨真價實的活人。而且他們根本不會出現在那份冰冷的爬蟲名單上,他們藏在 referer 那個欄位裡。
當一個人在 ChatGPT 裡看到了你的連結,受到吸引點擊進來時,他的瀏覽器會在 Referer 標頭裡偷偷留下上一站的線索。所以要抓出這群人,就是去翻 log 裡的 referer:
awk -F'"' '{print $4}' access.log \
| grep -Eio 'chatgpt\.com|claude\.ai|perplexity\.ai|gemini\.google\.com' \
| sort | uniq -c | sort -rn
Google 在 2026 年 5 月 13 日給 GA4 添了一個叫 AI Assistant 的頻道,用的也就是這種笨方法。官方定義是這樣寫的:
"The medium is set to 'ai-assistant' and the campaign is set to '(ai-assistant)' if the referrer matches a list of AI Assistants."
請看清楚那句「matches a list」。這只是一份死板的名單核對,根本沒有什麼高深的 AI 偵測技術。你自己用 grep 敲出來的邏輯,跟 GA4 骨子裡做的事一模一樣。這也代表了:名單上沒寫的,你們就永遠錯過了。
Cloudflare 弄了一個叫 crawl-to-refer ratio 的殘酷指標,官方定義是把某個平台爬取你 HTML 的次數,除以他們真正送過來的人數。說白了就是:他白嫖了你多少頁的心血,才願意介紹一個客人給你。
這是 2025 年 7 月的成績單(發表於 2025-08-29 的官方部落格):
| 平台 | 爬取與導流的比例 |
|---|---|
| Anthropic | 38,065.7 : 1 |
| OpenAI | 1,091.4 : 1 |
| Perplexity | 194.8 : 1 |
| Microsoft | 40.7 : 1 |
| 5.4 : 1 | |
| DuckDuckGo | 0.3 : 1 |
這張表值得你深吸一口氣好好端詳。傳統搜尋引擎的比例是個位數,Google 爬了 5.4 頁,就會送你一個活人。而某些 AI 平台,那種貪婪的索求與微薄的回饋,比例居然懸殊到四位數甚至五位數。
我必須特別叮嚀:這些是 2025 年 7 月的舊帳了。網路上現在滿天飛的 2026 年版本,我循線追查下去,全都是不知打哪來的二手謠言,而 Cloudflare Radar 的官方數據頁面直接把我擋在門外(回了 403)。所以我只寫我能用雙手驗證的數字,並且把日期標得清清楚楚。如果你想拿這比例去跟別人說嘴,請自己去 Cloudflare Radar 看最新鮮的數字,別拿我這張舊表當擋箭牌。
同一份年度回顧裡還有個讓人唏噓的數據:所有 AI 機器人的流量加起來,佔了總 HTML 請求的 4.2%,而當年 Googlebot 光靠自己一家就吃掉了 4.5%。
這一段是我認為今天最沉重的一刻,因為它示範了當我們在量測時,該怎麼坦然承認自己的無能為力。
我們自己寫的判讀規則,只認得四個來歷:chatgpt.com、claude.ai、perplexity.ai、gemini.google.com。漏了誰?最大的那個:Google AI Mode 和 AI Overviews。你在 Google 搜尋時看到的那一整塊 AI 摘要,它送來的流量可能比前四家加起來還要龐大。
為什麼不去算它?因為根本算不出來,絕對不是因為它無足輕重。
Google 自己在 GA4 頻道的定義裡講得很絕情:
"Organic Search is the channel by which users arrive at your site/app via non-ad links in organic-search results, including Google's AI Overviews and AI Mode."
看見了嗎?Google 把自己 AI 產品送來的愛意,強硬地塞進了「自然搜尋」這個大分類裡,死也不肯把它們放進新開的 AI Assistant 頻道。從技術(referer)的角度來看,理由簡單得可笑:那個點擊的來源字串就是 google.com,跟一個毫無感情的普通搜尋點擊長得一模一樣。沒有任何一種基於 referer 的手法能把這兩者剝開。GA4 辦不到,我們辦不到,你自己寫的腳本也辦不到。
所以我們做了一個決定:寧可承認自己看不見,也不要去瞎編。與其用自作聰明的猜測把一部分搜尋流量硬貼上「AI 導流」的標籤,不如老實承認這是一塊無法碰觸的禁區。
(這裡順手捏碎一個在中文圈陰魂不散的謠言:「AI Mode 的連結帶了 noreferrer,所以絕對追蹤不到」。這在 2025 年 5 月 AI Mode 剛問世時確實是真的,但 Google 在同個月底就悄悄修好這個破綻了。GA4 現在能把它收編進自然搜尋裡,這件事本身就是鐵證,因為要能歸類就代表一定拿得到 referer。到了 2026 年還在傳這句廢話的人,只是在反芻一個早就死透的 bug。)
就算我們能算得出那四個平台,referer 也是個隨時會翻臉不認人的線索。Ahrefs 的 Patrick Stox 在 2025 年 5 月用 Chrome DevTools 挨個去逼問 document.referrer,發現就算是同一個產品,態度也反覆無常:ChatGPT 付費大爺點的內文連結被貼上了 noreferrer(你什麼都收不到),免費帳號的反而收得到;Perplexity 網頁版願意送出線索,桌面 app 卻一聲不吭;Grok 更是絕情到從來不送。
這一切的罪魁禍首是 W3C 的 Referrer-Policy 規範。現在的預設值是 strict-origin-when-cross-origin,而 no-referrer 這個指令會讓標頭「be omitted entirely」;就連在連結上加個 rel="noreferrer" 都能瞬間切斷聯繫。要不要留下線索,完全是對方的單方面決定,你在家裡枯等是沒有任何辦法的。
(那份測試只是 2025 年 5 月的感情快照,這些大廠隨時會變心。關於 referer 這個渣男的完整黑歷史,我們會在第 25 天專門開一堂課來處理。)
把前面所有的愛恨情仇,濃縮成一段你可以直接貼去終端機跑的腳本。底下的輸出來自昨天那份我親手編織的示範 log,數字並不屬於任何一家真實的網站:
awk -F'"' '{print $6}' access.log | awk '
/GPTBot|ClaudeBot|CCBot|meta-externalagent|FacebookBot/ {t++; next}
/OAI-SearchBot|PerplexityBot|Claude-SearchBot|meta-webindexer/ {i++; next}
/ChatGPT-User|Claude-User|Perplexity-User|meta-externalfetcher/ {r++; next}
/Googlebot|bingbot|Applebot/ {s++; next}
/AhrefsBot|SemrushBot/ {seo++; next}
/facebookexternalhit/ {p++; next}
/HeadlessChrome/ {u++; next}
{h++}
END{printf "① 訓練爬取 : %5d\n② 索引型 : %5d\n② 即時型 : %5d\n 傳統搜尋 : %5d\n SEO 工具 : %5d\n 社群預覽 : %5d\n 無法歸屬 : %5d\n 瀏覽器UA : %5d\n", t,i,r,s,seo,p,u,h}'
① 訓練爬取 : 523
② 索引型 : 151
② 即時型 : 37
傳統搜尋 : 188
SEO 工具 : 129
社群預覽 : 29
無法歸屬 : 58
瀏覽器UA : 569
再來揪出第三種真實的相遇:
awk -F'"' '{print $4}' access.log \
| grep -Eic 'chatgpt\.com|claude\.ai|perplexity\.ai|gemini\.google\.com'
170
四個數字一字排開,你就得到了一張無比清晰的 AI 關係圖譜:523 次是在粗暴地剝奪你的內容,151 次是把你寫進了名冊,37 次是有人渴望答案時跑來翻閱,170 個人類則是因為 AI 的指引親自走進了你的生命。
請特別注意最後那一格「瀏覽器 UA 569」。那裡面同時混雜著真實的人類、跑得動 JS 的高級機器人,以及假裝自己是 Chrome 的騙子。這格代表的不是「人數」,而是「我被蒙在鼓裡、分不出來的混沌」。這正是我們第四天要講「身分驗證」的原因。
| 你該捫心自問的 | 你該採取的行動 | |
|---|---|---|
| ① 掠奪型的訓練爬取 | 我願意剝開自己,讓他們拿去餵養模型嗎? | 完全是價值觀的抉擇。想拒絕,就用 robots.txt 裡的專屬 token,而且只對他們關門。 |
| ② 交換型的即時檢索 | 他們讀得懂我的內在嗎? | 幾乎沒理由拒絕。你要費心的是怎麼讓內容更好讀、結構化資料給得夠不夠齊全。 |
| ③ 真實的 AI 導流 | 這些人走進來之後,留下了什麼? | 這是唯一能轉換成實質回報的關係。但量測本身充滿盲區,請對自己誠實。 |
最愚蠢的悲劇,就是把這三種截然不同的關係混為一談。氣急敗壞地寫了一份嚴苛的 robots.txt,把所有 AI 爬蟲全擋在門外。這等於同時做了三件事:阻止了被當成訓練材料 (這也許是你渴望的)、親手把自己從 AI 的記憶裡連根拔除 (這絕對不是你想要的),然後對第三種真實的相遇毫無幫助 (因為來的根本不是爬蟲,是人)。
明天,我們要親手拆掉這三天以來一直賴以為生的地基:User-Agent 只是他們的一面之詞,從來不代表真實身分。我們會用 IP 與 ASN 狠狠地查核一次,看看那些自稱 GPTBot 的人裡,到底藏了多少騙子。
本文是「你的第一本 AEO x GEO 教戰手冊」系列第 3 天。系列實測與數據由 arrivl 整理 (Growth Analytics for the Agentic Web)。